iT邦幫忙

2026 iThome 鐵人賽

DAY 2
0
AI Engineering

拒當 API 韭菜!30 天手邊設備玩轉 AI Agent系列 第 2

【Day 02】我手上到底有多少算力?M3 Max vs ASUS Ascent GX10 規格盤點

  • 分享至 

  • xImage
  •  

每次想搭建地端 AI 工作站,硬體規格就是第一個難以跨越的難題,一打開規格表,看到 CPU 幾核、GPU 幾核、頻寬多少 GB/s,滿滿的數字排開,頭都昏了,看了半天也不知道該從何評估起。常常看著看著心累,默默切回雲端 API ...

這次不能再輕易放過自己。既然手邊是兩台既有設備,不用在購物車前猶豫不決,那就乖乖坐下來,搞清楚「這兩台到底能被我榨出多少價值」。

話先說在前頭:這不是跑分實測文,今天看不到任何效能圖表。今天要做的事很單純:看官方釋出的數據,釐清哪些數字是決定 Local Agent 跑得順不順的關鍵因子,哪些純粹只是印在包裝盒上好看而已。


看懂規格前,先挑出真正重要的指標

挑硬體大家最先盯著看的通常是 CPU、GPU 核心數。核心多,理論峰值當然漂亮,但那比較像是「天花板」,不代表日常巡航速度。尤其是跑 Agent 這種負載,動不動就呼叫模型、等 Tool 回傳、再來回迭代,瓶頸往往根本不在算力上限。

比算力更早遇到瓶頸的,永遠是記憶體:

  • 記憶體容量: 模型權重塞不進去,後面速度再快都是空談,直接 OOM 給你看。
  • 記憶體機制: 兩台設備都主打「統一記憶體」,但骨子裡是兩碼子事。Apple 是把 CPU 和 GPU 刻在同一顆 SoC 上,實體上共享同一塊記憶體;GX10 則是 Grace CPU 與 Blackwell GPU 各自獨立,中間拉一條頻寬極高的 NVLink-C2C 橋接,在軟體層面模擬出連續的定址空間。機制不同,盲目比數字只會導出奇怪的結論。
  • 記憶體頻寬: 大語言模型在推論階段,主要仰賴頻寬而不是純算力。每生出一個 token,整包模型參數就得在記憶體裡重新搬運一輪。換句話說,算力再高,頻寬如果卡住,輸出也快不起來。
  • 精度支援: 晶片有沒有針對低位元運算做硬體加速,直接決定模型能壓得多小、跑得多快、掉多少精度。原生硬體支援跟純靠軟體層模擬,跑起來根本是兩個世界。
  • 推論框架與生態整合: 規格再猛,要是主流框架沒有針對它最佳化,效能直接打折。

兩位選手登場

MacBook Pro M3 Max

手邊這台是滿血版:16 核心 CPU(12P + 4E)、40 核心 GPU,附帶 16 核心 Neural Engine。翻了 Apple 規格才發現,64GB 統一記憶體剛好綁定在這個晶片級別,記憶體頻寬來到 400GB/s。
推論生態主要是 llama.cpp跟 Apple 自家的 MLX。它沒有硬體級的極低位元加速電路,量化推論基本得靠軟體層硬扛。

ASUS Ascent GX10

這台搭載 NVIDIA GB10 Grace Blackwell Superchip,CPU 給了 20 核心 Arm,GPU 則是 Blackwell 架構配第五代 Tensor Core。記憶體配了 128GB LPDDR5x,頻寬為 273GB/s。官方標榜 FP4 精度下算力峰值可達 1 petaFLOP,號稱單機最高能吃下 200B 參數的模型。
系統走的是專為 AI 打造的 NVIDIA DGX OS,底層是熟悉的 Ubuntu Linux。軟體生態毫無懸念是標準 CUDA 全家桶——vLLM、TensorRT-LLM、llama.cpp 隨插隨用;更關鍵的是它自帶 FP4 Transformer Engine 原生硬體支援,這是 Mac 無法享有的優勢。


規格排排坐

項目 MacBook Pro (M3 Max) ASUS Ascent GX10
CPU 16 核心 (12P + 4E) 20 核心 Arm
GPU 40 核心 Blackwell 架構 (第 5 代 Tensor Core)
記憶體容量 64GB 128GB
記憶體頻寬 400GB/s 273GB/s
架構機制 SoC 內部實體統一記憶體 Grace-Blackwell (NVLink-C2C 橋接)
低位元硬體支援 軟體模擬 原生 FP4 Transformer Engine
作業系統 macOS DGX OS (Ubuntu-based)
主流推論框架 llama.cpp / MLX vLLM / TensorRT-LLM / llama.cpp

數字攤開後,幾個有趣的切入點

  • 容量與頻寬的微妙反差: GX10 容量整整是 Mac 的兩倍,直覺上應該全方位輾壓,但頻寬反而是 Mac 的 400GB/s 佔優勢。照運算特性推敲,GX10 的優勢在於「吞得下大模型」,而 Mac 說不定在「同一顆中小型模型的生成速度」上會有驚喜。當然,這純屬紙上推論,是真是假後續揭曉
  • 統一記憶體的本質差異: 一邊是極致整合的單晶片思路,另一邊是高速匯流排橋接的模組架構。後者更偏向伺服器思維,也說明了 GX10 本來就不是拿來當個人電腦用的,它生來就是一台專屬運算節點。
  • 硬體精度的斷層: GX10 原生吃 FP4,意味著在容量吃緊時能用更極限的量化塞進巨型模型,速度損失也小;Mac 缺乏專用電路,全靠軟體支撐。這代表挑選模型跟量化格式時,兩台設備很難放在完全對等的基準線上去比。

帳面數字之後

以上這些,終究都是印在規格表、寫在官網頁面上的紙上談兵。GX10 帳面看起來像是全面壓制,但那份優勢能不能真的落地,還得看軟體生態撐不撐得起來、實際部署會不會卡關;Mac 那個「頻寬領先」的小驚喜,也可能在真正跑起模型之後,被其他沒列在規格表上的因素抵銷掉。

帳面規格說到底只是預測,不是答案。這兩台設備真正的實力差距,得等實際把模型跑起來、量出數據之後才算數——這部分,就留到後面幾天慢慢揭曉。


上一篇
【Day 01】拒當 API 韭菜!為什麼我要自己手搓 Local AI Agent?
下一篇
Day 03】MacBook Pro 推論引擎 該選 MLX 還是 llama.cpp?
系列文
拒當 API 韭菜!30 天手邊設備玩轉 AI Agent4
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言